메뉴

#LLM 벤치마크

HN
Hacker News • 24일 전
IMP 6

LLM 지능 대비 비용 그래프의 오해와 진짜 비교

OpenTeams 엔지니어가 ArtificialAnalysis의 '지능 vs 비용' 그래프가 로그 스케일 사용, 공식 API 가격만 반영, 로컬 모델의 데이터센터 가격 표기 등으로 실제 비용 차이를 왜곡한다고 지적합니다. 저자는 선형 스케일과 실제 최저 임대 가격, 로컬 실행 전기요금을 반영한 자체 그래프를 공유하며, 단순 작업에 비싼 모델을 쓰는 것은 낭비임을 강조합니다.

LLM 벤치마크 비용 효율 ArtificialAnalysis
HN
Hacker News • 33일 전
IMP 8

GLM-5.3, 오픈 웨이트 모델이 Anthropic·OpenAI 제치고 1/5 비용으로 1위

실무 과제 28개 기반 리더보드에서 오픈 웨이트 모델인 GLM-5.3이 코딩·데이터·실전·보안·툴 사용 등 5개 영역 모두 100% 통과율을 기록하며 최상위에 올랐습니다. 한 바퀴(랩)당 비용이 $0.28로 gpt-5.5($1.43)의 약 1/5 수준이며, 유일한 단점은 첫 토큰 지연시간(16.3초)입니다. 반면 fable-5는 28개 과제 중 5개를 거부해 79%로 공동 최하위에 그쳤습니다.

GLM 오픈소스 리더보드
TD
The Decoder • 35일 전
IMP 7

인간의 믿음을 무시하는 월드 모델은 잘못된 행동을 예측한다

새 연구에 따르면 Sora, Genie 3 등 현존 월드 모델은 물리적 상태만 모델링할 뿐 사람의 믿음·의도·감정 등 정신적 상태를 반영하지 않아 다음 행동을 잘못 예측합니다. 연구진은 믿음, 주의, 목표, 감정, 사회적 관계 등 정신 변수를 통합한 'Mental World Modeling(MWM)' 프레임워크와 학습 없이 작동하는 참조 구현 MENTIS, 평가 데이터셋 Menti-Bench를 공개했으며, MWM 파이프라인 적용 시 F1 점수가 63.3에서 87.9로 상승했습니다.

월드 모델 정신 모델링 AI 에이전트
HN
Hacker News • 45일 전
IMP 8

AI 에이전트로 신소재를 발견하는 디스커버드 머티리얼즈 (YC P26)

이 글은 반도체 산업에 필수적인 고효율 3D 칩용 방열 유전체 신소재를 AI 에이전트가 발굴하는 연구 벤치마크를 소개합니다. 최신 LLM들이 안정성을 갖춘 500개 이상의 새로운 소재를 계산적으로 발견하는 데 성공했지만, 박막 증착 합성 경로를 제안하는 것은 매우 어려워 1개만이 실제 합성 가능한 것으로 확인되었습니다. 이는 AI가 이론적 신소재 설계를 넘어, 실제 실험실 구현 가능성을 고려하는 단계로 나아가야 하는 중요한 과제를 시사합니다.

AI 에이전트 신소재 발견 반도체 산업
HN
Hacker News • 100일 전
IMP 7

로봇이 달려올 때, 당신은 어떤 AI를 선택할 것인가?

한 개발자가 11개의 주요 대형 언어 모델(LLM)을 2D 배틀로얄 게임에 투입해 30판의 대결을 시켜보았습니다. 그 결과, 승리와 효율성에서는 엑스AI의 Grok이 압도했으나, 협력과 소통에서는 Anthropic의 Claude가 뛰어난 성능을 보였습니다. 이 실험은 기존의 정적인 AI 벤치마크가 실제 에이전트의 행동과 성향을 예측하는 데 한계가 있음을 보여줍니다.

LLM 벤치마크 AI 에이전트 배틀로얄 실험
HN
Hacker News • 127일 전
IMP 6

안티그래비티 2.0, OpenSCAD 건축 3D LLM 벤치마크 1위

ModelRift가 여러 AI 코딩 도구를 대상으로 텍스트 기반의 파라미터 3D 모델링 도구인 OpenSCAD를 사용해 판테온을 설계하는 벤치마크를 진행했습니다. 그 결과, 안티그래비티 2.0(Antigravity 2.0) 모델이 가장 뛰어난 공간 기하학 처리 및 건축적 디테일 구현 능력을 보여주며 1위를 차지했습니다. 이 벤치마크는 LLM이 복잡한 3D 형상을 얼마나 잘 코드로 변환하는지 평가하여, AI가 실제 CAD 및 3D 프린팅 워크플로우에 적용될 수 있는지를 보여준다는 점에서 중요합니다.

3D 모델링 AI 코딩 에이전트 LLM 벤치마크
HN
Hacker News • 146일 전
IMP 8

중국 AI 모델, 코딩 경진대회서 클로드·GPT 제쳤다

중국 스타트업 문샷AI(Moonshot AI)의 오픈웨이트 모델인 'Kimi K2.6'이 실시간 프로그래밍 및 퍼즐 대회에서 서구권 주요 AI 모델들을 제치고 압도적인 1위를 차지했습니다. 특히 2위 역시 중국 샤오미의 'MiMo V2-Pro'가 차지하며, 특정 과제에서 중국산 AI 모델들의 코딩 및 전략적 추론 능력이 글로벌 최고 수준에 도달했음을 보여주었습니다.

AI 코딩 오픈웨이트 문샷AI